14

Дневная сводка: Сбер AI -- 14.07.2026

Публикации дня посвящены выпуску двух речевых моделей в Open Source, принятых на главную мировую конференцию по речевым технологиям Interspeech 2026.


Ключевые события и темы

Новые модели для работы со звуком: GigaChat Audio и GigaAM Multilingual

Сбер AI выложил в Open Source две модели. GigaChat Audio -- audio-native LLM, способная обрабатывать до 2 часов аудио с удержанием контекста: поиск фрагментов в длинных записях, создание саммари с таймкодами, распознавание эмоций с точностью более 90%. На бенчмарке RuBQ-Audio модель показывает 60,0 против 43,7 у Qwen3-Omni.

GigaAM Multilingual расширяет модель распознавания речи на казахский, киргизский, узбекский и английский языки. Компактная версия на 240M параметров превосходит Whisper Large v3 и Omnilingual 1B. Благодаря предобучению на 2 млн часов речи на более чем 70 языках модель достигает WER около 4% против 11%+ у Whisper.

Обе модели приняты на Interspeech 2026.

Ссылки:


Итог

14 июля Сбер AI анонсировал значимый вклад в область речевых технологий: две Open Source модели, превосходящие конкурентов на ключевых бенчмарках. Особенно важна поддержка языков СНГ в GigaAM Multilingual, заполняющая нишу, которую глобальные модели вроде Whisper обслуживают значительно хуже.